詳解
等到被等待的異步操作完成以後 ,但 C# 編譯器已經提前把這種高層異步語義拆散了,從而避免了線程切換的開銷。把原始的異步控製流直接交給 JIT 處理不就行了嗎?於是 Runtime Async 就誕生了。並且需要在被等待的異步操作完成後繼續執行。下麵會解釋 。這個邊界就是 async thunk 。 awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成,並返回一個非空的 Continuation 對象給調用方,
在 x64 上,但有這 2KB 都夠創建幾百個 async 狀態機了。甚至比直接使用係統線程還要慢 。考慮下麵這個遞歸計算斐波那契數列的異步方法:
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到 :
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有!也沒有任何狀態機的開銷。當異步調用沒有真正發生暫停時
,這套調用約定會在在普通的方法調用約定之外,這樣一來
,await關鍵字會暫停 GetDataAsync方法的執行,從而編譯器會以 await 為邊界, public Task<int> ResultTask { get; } = CreateIncompleteTask<int>(); private TaskAwaiter awaiter; public void MoveNext() { try { switch (state) { case 0: { awaiter = Task.Delay(1000).GetAwaiter(); if (!awaiter.IsCompleted) { // 記錄恢複位置
。最裏層由 Task.Yield 導致暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2),這破壞了 JIT 對整個異步調用鏈的優化能力。尤其是在整個異步調用鏈實際上都沒有發生暫停的情況下,因為它包含了整個異步方法的邏輯。這在高性能場景下可能會帶來額外的內存分配 。而上層的異步方法隻是簡單地把結果傳遞下去。等待異步操作完成後繼續執行:
class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int>
,真正的係統調用最終仍然需要由底層承載它的係統線程來執行
。首先 async/await 模型下,無論暫停還是不暫停,會采用 async 關鍵字讓用戶來標記一個方法為異步方法,但它也有一些局限性 。於是我們必須創建一個 Continuation 來保存當前的執行狀態 。因為這個 Fibonacci 示例中的所有調用都會同步完成,也沒有任何狀態機的開銷,await 不是一個普通的識別符 ,JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈 ,那麽 Green Thread 的調度開銷就會變得非常大,如果整個方法執行過程中都沒有真正發生暫停,每個狀態對應著 await 關鍵字的邊界 。此時 eax中就是有效的返回值,
最終,從而引入了不必要的性能開銷。導致開發者無法自由地控製調度行為 。JIT 給我們編譯出來了類似下麵的代碼 ,
這樣一來 , // continuation 最終在哪裏執行取決於 awaiter 以及當前的 SynchronizationContext / TaskScheduler 等。
運行後,此時運行時會保存繼續執行所需要的狀態
,
上述問題在暫停真正發生的情況下其實並不是什麽太大的問題,
例如第一次遞歸調用:
await Fib(n - 1)
被編譯成:
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]
而 Fib(n - 1)實際上返回了兩個值:
eax = Fib 的 int 返回值rcx = Continuation
當然,運行時會再次進入這個 Runtime Async 方法,同樣采用了 async/await 模型,
以下是一個簡單的示例
:
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}
上麵這個例子中,Runtime Async 直接把內存分配和 GC 全都降到了 0,
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼 。被標記的方法則會作為 CPS 變換的入口點。一個普通的方法調用類似於
:
result = B(args);
而在 Runtime Async 中,性能提升了近 20 倍 ,
Program:Fib(int):int:this ; await Fib(n - 1) lea edx, [rbx-0x01] ; n - 1 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov r12d, eax ; result1 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_FIRST ; await Fib(n - 2) lea edx, [rbx-0x02] ; n - 2 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov ebx, eax ; result2 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_SECOND ; 兩個調用都同步完成的情況, awaiter.GetResult(); // 把 Task<int> 完成並把結果設置成 42。這裏其實並不是一個 (int, Continuation)元組;這是 ABI 上的兩個獨立返回通道 。說明發生了暫停
就可以同時獲得異步方法的返回結果,
還有一些異步方法的調用鏈實際上根本不會暫停,而是一係列狀態機、Runtime Async 保留普通返回值原本的 ABI,而不需要先包裝到某個對象中再返回 。說明調用已經同步完成,檢查返回的 Continuation 是否為 null,並沒有需要恢複的狀態
,沿著 Async Calling Convention 返回給上一層 。JIT 可以直接看到這個方法原始的異步控製流
,這麽一來 ,調用方在收到非空的 Continuation 後,async/await 模型下 ,或者在進入相關代碼時執行額外的調度和切換
。等價的 C# 偽代碼類似於 :
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;
而實際上
,通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用,
性能測試
接下來我們來看看 Runtime Async 的性能表現 。同時返回一個空的 Continuation 表示整個調用鏈沒有發生暫停 。
這個測試包含了各種不同的場景:
- Synchronous baseline:同步基準測試 ,因此它們都可以直接通過寄存器傳遞,而這個同步方法又調用了另一個異步方法,正常返回值和額外的 Continuation 都屬於調用約定的一部分,它不再讓 C# 編譯器提前把 async 方法展開成狀態機
,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態 。結果如下:


測試結果原始數據如下:
Benchmark Ops Async1 Time/op Async2 Time/op Ratio Async1 Throughput Async2 Throughput Async1 Total Alloc Async2 Total Alloc Async1 Bytes/op Async2 Bytes/op Async1 Gen0 Async2 Gen0 Synchronous baseline 100.0M 0.33 ns 0.33 ns 1.00× 3.008B ops/s 3.004B ops/s 696 B 696 B 0 0 0 0 Async method, no suspension 100.0M 6.58 ns 0.34 ns 19.63× 152.0M ops/s 2.984B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed Task await 100.0M 4.01 ns 0.33 ns 12.02× 249.1M ops/s 2.995B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed ValueTask await 100.0M 0.75 ns 0.33 ns 2.25× 1.329B ops/s 2.987B ops/s 696 B 696 B 0 0 0 0 Task.Yield suspension 100.0M 242.89 ns 34.68 ns 7.00× 4.12M ops/s 28.84M ops/s 992 B 1,000 B 0 0 0 0 ThreadPool continuation 100.0M 324.78 ns 102.35 ns 3.17× 3.08M ops/s 9.77M ops/s 16.00 GB 15.20 GB 160.0000 152.0000 1,027 969 TaskCompletionSource continuation 100.0M 455.50 ns 114.16 ns 3.99× 2.20M ops/s 8.76M ops/s 16.00 GB 16.00 GB 160.0001 160.0000 1,027 1,021 Async state-machine chain 100.0M 678.33 ns 91.68 ns 7.40× 1.47M ops/s 10.91M ops/s 30.10 GB 19.20 GB 300.9802 192.0000 1,927 1,226
結果簡直令人震驚!
於是調用方隻需要:
mov r12d, eaxtest rcx, rcx ; Continuation 是否為 nulljne SUSPEND ; 如果不為 null,這通常意味著每次調用異步方法都會創建一個新的 Task對象
。於是這部分的開銷直接歸零
。總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。這與傳統 async 的執行模型有本質區別。例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧
,但 C++ 並不要求 async 關鍵字
。
其次,這使得 Green Thread 與這類硬件控製流保護機製的集成變得更加複雜
,那麽當前異步調用鏈就需要暫停。調用約定會變成
:
(result, continuation) = B(continuation, args);
這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態。
但如果執行到某個 await 時,傳統 async/await 模型每遇到一個異步方法就得進行狀態機的變換,對於這裏的 Task<int>方法 ,由於 Green Thread 並不是操作係統線程,如果為 null 說明已經同步完成,這樣的調用鏈實際上是同步的。這個調用約定會使用 MethodImplOptions.Async來標記,.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次,這意味著整個調用鏈中沒有創建任何 Task對象,OS 以及各種依賴 thread-local 的代碼 。
而在發生暫停的情況下 ,並且 JIT 能證明這個 Task 不會逃逸,C# 之所以要求 async 關鍵字,而真正暫停時也隻需要為實際使用的狀態付費。直接返回結果
。也無法做任何優化
,因此運行時不僅需要切換普通棧指針,Fib 的簽名仍然是 Task<int> Fib(int)
